Sino-US-DrugQA: A Benchmark for Evaluating Large Language Models in Cross-Jurisdictional Pharmaceutical Regulation
Die Studie stellt Sino-US-DrugQA vor, ein bilingualer Benchmark-Datensatz mit über 11.000 Fragen, der zeigt, dass aktuelle Large Language Models zwar bei monolingualen regulatorischen Abfragen nutzbar sind, jedoch bei vergleichenden Analysen zwischen US-amerikanischen und chinesischen Arzneimittelvorschriften signifikante Leistungseinbußen aufweisen, was eine vorsichtige, von Experten überwachte Anwendung erfordert.